Contrôle de type on-policy par approximations

3. Contrôle semi-gradient sur des tâches continues

On se place maintenant dans le cas des problèmes continus, c'est-à-dire dans le cas où les interactions entre l'agent et l'environnement ne se terminent jamais (il n'y a pas ici d'état terminal ou de départ). Dans ce cas, la technique la plus utilisée pour calculer le revenu est de réaliser une moyenne des récompenses sans utiliser de facteur de remise. En effet, comme nous le verrons par la suite, l'utilisation d'un facteur de remise pose problème avec les approximations de fonctions.

3.1. Moyennage des récompenses

Dans le cadre de l'utilisation de la moyenne des récompenses pour le calcul des revenus, la performance de la stratégie $\pi$ se définie comme étant le taux moyen des récompenses obtenues lorsque l'agent suit la stratégie $\pi$, ici notée $r(\pi)$:

$r\left( \pi \right) = \mathop {\lim }\limits_{h \to \infty } \frac{1}{h}\sum\limits_{t = 1}^h {E\left[ {{R_t}|{S_{0},A_{0:t - 1}} \sim \pi } \right]}$

$\quad \quad = \mathop {\lim }\limits_{t \to \infty } E\left[ {{R_t}|{S_{0,}}{A_{0:t - 1}} \sim \pi } \right]$

$\quad \quad =\sum\limits_s {{\mu _\pi }\left( s \right)} \sum\limits_a {\pi \left( {a|s} \right)} \sum\limits_{s',r} {p\left( {s',r|s,a} \right)r}$

$\mu_{\pi}$ représente la distribution de visite des états en régime établi. C'est la distribution dans laquelle reste l'agent si il choisit des actions selon la stratégie $\pi$ :

$$\sum\limits_s {{\mu _\pi }\left( s \right)} \sum\limits_a {\pi \left( {a|s} \right)p\left( {s'|s,a} \right) = } {\mu _\pi }\left( {s'} \right)$$

On considère que cette quantité existe pour n'importe quelle stratégie $\pi$ et est indépendante de l'état initial $S_0$ (c'est l'hypothèse d'ergodicité sur le MDP : l'endroit où le MDP débute n'a qu'une conséquence limitée dans le temps sur la dynamique qu'il va prendre, et donc aucune conséquence sur le long terme) :

$${\mu _\pi }\left( s \right) = \mathop {\lim }\limits_{t \to \infty } {\rm{ }}\Pr \left\{ {{S_t} = s|{A_{0:t - 1}} \sim \pi } \right\}$$

3.2. Optimalité des stratégies

Les stratégies sont ordonnées en fonction du revenu moyen qu'elles permettent d'obtenir, c'est-à-dire en fonction de leur valeur $r(\pi)$. En particulier, on considère comme optimales les stratégies qui obtiennent un maximum de revenu moyen $r(\pi)$.

3.3. Revenus différentiels

Dans le cadre du moyennage des récompenses, les revenus sont définis en terme de différences entre les récompenses et la moyenne des récompenses. C'est ce qu'on appelle les revenus différentiels :

$${G_t} = {R_{t + 1}} - r\left( \pi \right) + {R_{t + 2}} - r\left( \pi \right) + {R_{t + 3}} - r\left( \pi \right) + ...$$

3.4. Fonctions des valeurs différentielles

Les fonctions des valeurs associées aux revenus différentiels sont appelées les fonctions des valeurs différentielles. Elles sont définies de la même manière que ce que nous avions vu dans la formation d'initiation à l'apprentissage par renforcement :

  • Fonction des valeurs différentielle des états :
$${v_\pi }\left( s \right) = {E_\pi }\left[ {{G_t}|{S_t} = s} \right]$$
  • Fonction des valeurs différentielle des actions :
$${q_\pi }\left( {s,a} \right) = {E_\pi }\left[ {{G_t}|{S_t} = s,{A_t} = a} \right]$$

Les équations de Bellman sont donc définies de la manière suivante (voir le chapitre 2 de la formation d'initiation à l'apprentissage par renforcement) :

  • Équation de Bellman différentielle des valeurs des états :

$\quad \quad \quad \quad \quad \quad \quad \quad {v_\pi }\left( s \right) = \sum\limits_a {\pi \left( {a|s} \right)} \sum\limits_{r,s'} {p\left( {s',r|s,a} \right)\left[ {r - r\left( \pi \right) + {v_\pi }\left( {s'} \right)} \right]}$

  • Équation de Bellman différentielles des valeurs des actions :

$\quad \quad \quad \quad \quad \quad \quad \quad {q_\pi }\left( {s,a} \right) = \sum\limits_{r,s'} {p\left( {s',r|s,a} \right)\left[ {r - r\left( \pi \right) + {v_\pi }\left( {s'} \right)} \right]} $

3.5. Cas des méthodes TD(0)

Dans le cadre des méthodes par différences temporelles, on peut donc définir les erreurs suivantes (voir le chapitre 6 de la formation d'initiation à l'apprentissage par renforcement) :

  • Erreur différentielle sur les valeurs des états :
$${\delta _t} = {R_{t + 1}} - \overline {{R_t}} + \hat v\left( {{S_{t + 1}},{\textbf{w}_t}} \right) - \hat v\left( {{S_t},{\textbf{w}_t}} \right)$$

avec $\overline {{R_t}}$ qui représente l'estimation au temps $t$ de la moyenne des revenus $r(\pi)$.

  • Erreur différentielle sur les valeurs des actions :
$${\delta _t} = {R_{t + 1}} - \overline {{R_t}} + \hat q\left( {{S_{t + 1}},{A_{t + 1}},{\textbf{w}_t}} \right) - \hat q\left( {{S_t},{A_t},{\textbf{w}_t}} \right)$$

3.6. Méthode du semi-gradient différentielle de type Sarsa 1-pas

De cette manière, on peut donc utiliser dans le cadre des tâches continues l'ensemble des algorithmes étudiés dans la formation d'initiation à l'apprentissage par renforcement (qui étaient appliqués sur des environnements discrets). Par exemple, la version différentielle du semi-gradient Sarsa est définie par l'équation suivante :

$${\textbf{w}_{t + 1}} = {\textbf{w}_t} + \alpha {\delta _t}\nabla \hat q\left( {{S_t},{A_t},{\textbf{w}_t}} \right)$$

3.7. Algorithme de la méthode différentielle semi-gradient Sarsa (1-pas)

3.8. Algorithme de la méthode différentielle semi-gradient Q-learning